IT之家
07-29 07:06
AI 公司被曝大量收购旧书,以获取“纯净”训练素材
📌 一句话:AI公司为获取无AI污染的训练数据,转向大规模收购实体旧书作为大模型语料。
💡 3个要点
数据污染成隐患:互联网内容中AI生成文本泛滥,用这些"脏数据"训练新模型会陷入质量下降的恶性循环
旧书成为"净土":实体书籍出版时间早、版权状态相对清晰,内容未经AI污染,成为高质量训练语料的新来源
数据争夺白热化:收购旧书已成AI行业新赛道,未来高质量语料价格将持续攀升
📖 背景
大模型训练需要海量文本数据,但随着AI生成内容爆发式增长,互联网语料库正被自己"污染"。实体书籍作为未被AI染指的"净土",自然成为兵家必争之地。
💭 点评
这场"数据淘金热"背后是AI发展的深层焦虑——当AI开始污染自己成长的"养分",行业不得不向故纸堆求救。旧书的商业价值被重新发现,本质上暴露了大模型对优质数据源的结构性依赖。这场数据战争才刚刚开始,最终谁掌握"纯净"语料,谁就握住了AI时代的命脉。
📖 原文链接
点击阅读原文 →